独特融合算子：Sigmoid+Clamp+Affine。一次内核完成仿射、Sigmoid 和上下界裁剪（默认 0.01..0.99），适用于需要防梯度饱和的场景。

torchcode.py：参考实现 `y = clamp(sigmoid(x*scale + bias), low, high)`。
cudacode.py：`__global__ void sigmoid_clamp_affine_kernel(...)` 完成融合计算，使用 FMA 与 clamp。
run_code.py：比较精度与性能（100 次迭代，`rtol=1e-03`）。
